Видео с ютуба Moe Inference
A Visual Guide to Mixture of Experts (MoE) in LLMs
What is Mixture of Experts?
API PyTorch для высокопроизводительного обучения и вывода MoE — Д. Вега-Мюре, Ке Вэнь и Н. Гимель...
Mixture of Experts (MoE), Visually Explained
Fast Inference of Mixture-of-Experts Language Models with Offloading
NSDI '26 - SwiftEP: Accelerating MoE Inference with Buffer Fusion and TMA Offloading
PyTorch Day India 2026 Оптимизация вывода MoE на NVIDIA Blackwell с помощью vLLM и NVFP4 Прасад Муке
Ошибки, связанные с численным равенством в обучении и выводе MoE.
Staleness-Centric Optimizations for Parallel Diffusion MoE Inference (ICCV 2025 Paper)
Stop One-Shotting MoE Models - Why They Fail and What Works
[2024 Best AI Paper] Fast Inference of Mixture-of-Experts Language Models with Offloading
DOT-MoE: Дифференцируемый оптимальный транспорт для MoEfication | ResearchPod
Оптимизация больших вычислительных уровней MoE на NVIDIA Blackwell: NVFP4, ADP и DualPipe Strat.....
How KV Cache Speeds Up LLMs for Faster AI Models on GPUs
Что такое модели смешанного экспертного анализа | с участием Аритры
Оптимизация вывода LLM №2: тензорный, экспертный и экспертный параллелизм (TP, DP, EP, MoE)
Stanford CS336 Language Modeling from Scratch | Spring 2025 | Lecture 4: Mixture of experts
Nemotron-3.5-Lightning: Mamba-2, MoE, and NVFP4 Inference
Чтение по инференсу LLM 02: Mixture of Experts и WideEP (дисбаланс экспертов, All-to-All)
Dense vs MoE Models Explained Simply in 5 Minutes